شاید متوجه شده باشید که داده های عددی اغلب با مقدار متوسط خلاصه می شوند. به عنوان مثال ، کیفیت یک دبیرستان گاهی اوقات با یک شماره خلاصه می شود: میانگین نمره در یک آزمون استاندارد. گاهی اوقات ، شماره دوم گزارش می شود: انحراف استاندارد. به عنوان مثال ، شما ممکن است گزارشی را بخوانید که می گوید نمرات 680 به علاوه یا منهای 50 (انحراف استاندارد) بوده است. این گزارش فقط یک بردار کامل از نمرات را با دو شماره خلاصه کرده است. آیا این مناسب است؟آیا اطلاعات مهمی وجود دارد که ما فقط با نگاه کردن به این خلاصه به جای کل لیست از دست می دهیم؟
اولین بلوک ساختمان تجسم داده ما در حال یادگیری خلاصه لیست عوامل یا بردارهای عددی است. بیشتر اوقات ، بهترین راه برای به اشتراک گذاشتن یا کشف این خلاصه از طریق تجسم داده ها است. اساسی ترین خلاصه آماری لیستی از اشیاء یا اعداد ، توزیع آن است. هنگامی که یک داده به عنوان توزیع خلاصه شد ، چندین روش تجسم داده وجود دارد که به طور مؤثر این اطلاعات را منتقل می کند. به همین دلیل ، درک عمیق مفهوم توزیع مهم است.
در این فصل ، ما ابتدا در مورد خواص انواع توزیع ها و نحوه تجسم توزیع با استفاده از یک نمونه انگیزه بخش از ارتفاعات دانشجویی بحث می کنیم. سپس در مورد هندسه GGPLOT2 برای این تجسمات در بخش 9. 8 بحث می کنیم.
9. 1 انواع متغیر
دو نوع اصلی متغیر طبقه بندی و عددی هستند. هر یک را می توان به دو گروه دیگر تقسیم کرد: طبقه بندی می تواند نظم باشد یا خیر ، در حالی که متغیرهای عددی می توانند گسسته یا مداوم باشند. هنگامی که هر ورودی در یک مجموعه داده از یکی از تعداد کمی از گروه ها تهیه می شود ، ما به داده ها به عنوان داده های طبقه بندی شده اشاره می کنیم. دو نمونه ساده عبارتند از: جنس (مرد یا زن) و مناطق ایالات متحده (شمال شرقی ، جنوب ، شمال مرکزی ، غرب). برخی از داده های طبقه بندی شده حتی اگر به خودی خود شماره ای نباشند ، مانند ادویه (خفیف ، متوسط ، گرم) سفارش داده می شوند. در کتابهای درسی آماری ، داده های طبقه بندی شده سفارش داده شده به داده های ترتیب داده می شوند. نمونه هایی از داده های عددی اندازه جمعیت ، میزان قتل و ارتفاع است. برخی از داده های عددی را می توان به صورت مقوله سفارش داده شد. ما می توانیم داده های عددی را به طور مداوم و گسسته تقسیم کنیم. متغیرهای مداوم مواردی هستند که در صورت اندازه گیری با دقت کافی می توانند از هر مقدار مانند ارتفاعات استفاده کنند. به عنوان مثال ، یک جفت دوقلو ممکن است به ترتیب 68. 12 و 68. 11 اینچ باشد. شمارش ، مانند اندازه جمعیت ، گسسته است زیرا باید تعداد دور باشد.
به خاطر داشته باشید که داده های عددی گسسته را می توان نظم در نظر گرفت. اگرچه این از نظر فنی صحیح است ، ما معمولاً اصطلاح داده های ترتیب را برای متغیرهای متعلق به تعداد کمی از گروه های مختلف رزرو می کنیم ، در حالی که هر گروه دارای اعضای زیادی هستند. در مقابل ، هنگامی که ما در هر گروه گروه های زیادی با موارد کمی داریم ، به طور معمول از آنها به عنوان متغیرهای عددی گسسته یاد می کنیم. بنابراین ، به عنوان مثال ، تعداد بسته های سیگار یک شخص در روز سیگار می کشد ، که به نزدیکترین بسته می رسد ، به صورت نظم در نظر گرفته می شود ، در حالی که تعداد واقعی سیگار یک متغیر عددی در نظر گرفته می شود. اما ، در واقع ، نمونه هایی وجود دارد که می توانند هم در هنگام تجسم داده ها عددی و منظم در نظر گرفته شوند.
در اینجا ما روی متغیرهای عددی تمرکز می کنیم زیرا تجسم این نوع داده بسیار پیچیده تر است. با این حال ، ما با توصیف تجسم داده ها و رویکردهای خلاصه برای داده های طبقه بندی شروع می کنیم.
9. 2 مطالعه موردی: توصیف ارتفاعات دانشجویی
ما یک مشکل انگیزه جدید را معرفی می کنیم. این یک مصنوعی است ، اما به ما کمک می کند تا مفاهیم مورد نیاز برای درک توزیع ها را نشان دهیم.
وانمود کنیم که ما باید ارتفاعات همکلاسی های خود را به ET توصیف کنیم ، فرازمینی که هرگز انسان را ندیده است. به عنوان اولین قدم ، ما باید داده ها را جمع آوری کنیم. برای انجام این کار ، از دانش آموزان می خواهیم که ارتفاعات خود را در اینچ گزارش دهند. ما از آنها می خواهیم که اطلاعات جنسی را ارائه دهند زیرا می دانیم دو توزیع متفاوت از طریق رابطه جنسی وجود دارد. ما داده ها را جمع می کنیم و آن را در قاب داده Heights ذخیره می کنیم:
یکی از راه های انتقال ارتفاعات به ET ، ارسال این لیست از 1050 ارتفاع است. اما روشهای بسیار مؤثرتری برای انتقال این اطلاعات وجود دارد و درک مفهوم توزیع مهم خواهد بود. برای ساده کردن توضیح ، ابتدا روی ارتفاعات مرد تمرکز می کنیم. ما داده های زنان را در بخش 9. 6 بررسی می کنیم.
9. 3 توزیع
اساسی ترین خلاصه آماری لیستی از اشیاء یا اعداد ، توزیع آن است. ساده ترین راه برای فکر کردن در مورد توزیع ، به عنوان توصیف جمع و جور از لیست با بسیاری از ورودی ها است. این مفهوم نباید برای خوانندگان این کتاب جدید باشد. به عنوان مثال ، با داده های طبقه بندی ، توزیع به سادگی نسبت هر دسته منحصر به فرد را توصیف می کند. سکس نشان داده شده در مجموعه داده های ارتفاعات:
این جدول فرکانس دو طبقه ساده ترین شکل توزیع است. ما واقعاً نیازی به تجسم آن نداریم زیرا یک شماره همه چیزهایی را که باید بدانیم توصیف می کند: 23 ٪ زن و بقیه مرد هستند. هنگامی که دسته های بیشتری وجود دارد ، یک بارپلت ساده توزیع را توصیف می کند. در اینجا مثالی با مناطق ایالتی ایالات متحده آورده شده است:

این طرح خاص به سادگی چهار عدد را به ما نشان می دهد ، یکی برای هر گروه. ما معمولاً برای نمایش چند شماره از بارپلت استفاده می کنیم. اگرچه این طرح خاص بینش بیشتری نسبت به یک جدول فرکانس ارائه نمی دهد ، اما اولین نمونه از نحوه تبدیل یک بردار به یک نقشه است که به طور خلاصه تمام اطلاعات موجود در بردار را خلاصه می کند. هنگامی که داده ها عددی هستند ، وظیفه نمایش توزیع ها چالش برانگیزتر است.
9. 3. 1 هیستوگرام
داده های عددی که طبقه بندی نیستند نیز دارای توزیع هستند. با این حال ، به طور کلی ، هنگامی که داده ها طبقه بندی نیستند ، گزارش فرکانس هر ورودی ، همانطور که برای داده های طبقه بندی انجام دادیم ، خلاصه ای مؤثر نیست زیرا اکثر ورودی ها بی نظیر هستند. یا به عنوان مثال ، در مطالعه موردی ما ، در حالی که چندین دانش آموز از ارتفاع 68 اینچ خبر دادند ، تنها یک دانش آموز از ارتفاع 68. 503937007874 اینچ خبر داد و تنها یک دانش آموز از ارتفاع 68. 8976377952756 اینچ خبر داد. ما فرض می کنیم که آنها به ترتیب از 174 و 175 سانتی متر تبدیل شده اند.
کتابهای درسی آماری به ما می آموزند که یک روش مفیدتر برای تعریف توزیع برای داده های عددی تعریف تابعی است که نسبت داده های زیر (A ) را برای تمام مقادیر ممکن (A ) گزارش می دهد. این تابع به عنوان عملکرد توزیع تجمعی emipirical (ECDF) نامیده می شود ، می توان آن را ترسیم کرد و توضیحات کاملی از توزیع داده های ما ارائه می دهد. در اینجا ECDF برای ارتفاعات دانشجویی پسر است:

با این حال ، خلاصه کردن داده ها با ترسیم ECDF در واقع در عمل بسیار محبوب نیست. دلیل اصلی این است که به راحتی ویژگی های مورد علاقه مانند: توزیع در کدام ارزش را نشان نمی دهد؟آیا توزیع متقارن است؟چه محدوده ای شامل 95 ٪ از مقادیر است؟
هیستوگرام ، بسیار ترجیح داده می شود زیرا آنها پاسخ دادن به چنین سؤالاتی را بسیار تسهیل می کنند. هیستوگرام فقط اطلاعات کمی را برای تولید توطئه هایی که تفسیر آن بسیار ساده تر است ، قربانی می کنند. ساده ترین راه برای ایجاد هیستوگرام ، تقسیم دهانه داده های ما به سطل های غیر همپوشانی در همان اندازه است. سپس ، برای هر سطل ، تعداد مقادیری را که در آن بازه قرار می گیرند شمارش می کنیم. هیستوگرام این تعداد را به عنوان میله هایی با پایه نوار تعریف شده توسط فواصل مشخص می کند. در اینجا هیستوگرام برای داده های ارتفاع که دامنه مقادیر را به فواصل یک اینچ تقسیم می کند: ((49. 5 ، 50. 5] ، (50. 5 ، 51. 5] ، (51. 5،52. 5] ، (52. 5،53. 5]. (82. 5،83. 5] )

همانطور که در شکل بالا مشاهده می کنید ، یک هیستوگرام شبیه به یک بارپلو است ، اما از این نظر متفاوت است که محور x عددی است ، نه طبقه بندی.
اگر این طرح را به ET ارسال کنیم ، او بلافاصله برخی از خصوصیات مهم در مورد داده های ما را یاد می گیرد. اول ، دامنه داده ها از 50 تا 84 با اکثریت (بیش از 95 ٪) بین 63 تا 75 اینچ است. دوم ، ارتفاعات نزدیک به متقارن در حدود 69 اینچ است. همچنین ، با افزودن تعداد ، ET می تواند تقریب بسیار خوبی از نسبت داده ها را در هر بازه بدست آورد. بنابراین ، هیستوگرام فوق نه تنها تفسیر آسان است ، بلکه تقریباً تمام اطلاعات موجود در لیست خام 812 ارتفاع را با حدود 30 سطل سطحی ارائه می دهد.
چه اطلاعاتی را از دست می دهیم؟توجه داشته باشید که تمام مقادیر موجود در هر بازه هنگام محاسبه ارتفاعات سطل ، یکسان است. به عنوان مثال ، هیستوگرام بین 64 ، 64. 1 و 64. 2 اینچ تمایز قائل نیست. با توجه به اینکه این اختلافات تقریباً از نظر چشم قابل توجه نیست ، پیامدهای عملی ناچیز است و ما توانستیم داده ها را فقط به 23 عدد خلاصه کنیم.
ما در مورد نحوه کدگذاری هیستوگرام در بخش 9. 8 بحث می کنیم.
9. 3. 2 چگالی صاف
توطئه های چگالی صاف همان اطلاعات را به عنوان یک هیستوگرام منتقل می کنند اما از نظر زیبایی شناسی جذاب تر هستند. در اینجا آنچه یک طرح چگالی صاف برای داده های ارتفاعات ما به نظر می رسد:

در این طرح ، ما دیگر لبه های تیز در مرزهای فاصله نداریم و بسیاری از قله های محلی برداشته شده اند. همچنین ، مقیاس محور y از شمارش به چگالی تغییر یافته است. برای درک کامل تراکم صاف ، ما باید تخمین ها را درک کنیم ، موضوعی که بعداً پوشش نمی دهیم. در اینجا ما به سادگی آنها را با ترسیم منحنی که از بالای میله های Histogream می رود و سپس از بین بردن میله ها ، آنها را زیباتر می کنیم. مقادیر نشان داده شده محور y به گونه ای انتخاب شده اند که ناحیه زیر منحنی تا 1 تا 1 مورد استفاده قرار گیردبشر
مزیت تراکم صاف نسبت به هیستوگرام برای اهداف تجسم این است که تراکم مقایسه دو توزیع را آسان تر می کند. این بخش عمده ای است زیرا لبه های پیچیده هیستوگرام به هم ریخته می شود. در اینجا مثالی در مقایسه ارتفاعات زن و مرد آورده شده است:

با استدلال درست ، GGPLOT به طور خودکار منطقه تقاطع را با رنگ دیگری سایه می زند. ما نمونه هایی از کد GGPLOT2 را برای تراکم در بخش 10 و همچنین بخش 9. 8 نشان خواهیم داد.
9. 3. 3 توزیع عادی
هیستوگرام و توطئه های چگالی خلاصه های عالی از توزیع را ارائه می دهند. اما آیا می توانیم حتی بیشتر خلاصه کنیم؟ما اغلب شاهد انحراف متوسط و استاندارد به عنوان آمار خلاصه هستیم: خلاصه دو شماره! برای درک این خلاصه ها و اینکه چرا آنها به طور گسترده ای مورد استفاده قرار می گیرند ، باید توزیع عادی را درک کنیم.
توزیع عادی ، همچنین به عنوان منحنی بل و به عنوان توزیع گاوسی شناخته می شود. در اینجا توزیع عادی به نظر می رسد:

توزیع عادی یکی از مشهورترین مفاهیم ریاضی در تاریخ است. دلیل این امر این است که توزیع بسیاری از مجموعه داده ها را می توان با توزیع های عادی تقریب داد. این شامل شامل برنده های قمار ، ارتفاع ، وزن ، فشار خون ، نمرات آزمون استاندارد و خطاهای اندازه گیری تجربی است. کتابهای درسی آماری توضیحاتی را در مورد این مورد ارائه می دهند. اما چگونه می توان مجموعه داده های توزیع مشابه با محدوده های کاملاً متفاوت برای مقادیر ، به عنوان مثال ارتفاع و وزن را تقریبی کرد؟دومین ویژگی مهم توزیع عادی این است که می توان با تنظیم دو عدد ، که به عنوان میانگین یا میانگین و انحراف استاندارد (SD) ذکر شده است ، با مجموعه داده های مختلف سازگار شود. توزیع عادی متقارن است ، با محوریت آنچه که ما به عنوان میانگین از آن یاد می کنیم ، و بیشتر مقادیر (حدود 95 ٪) در 2 SD از میانگین هستند. طرح بالا توزیع عادی با میانگین 0 و SD 1 را نشان می دهد ، که اغلب از آن به عنوان یک استاندارد معمولی یاد می شود. توجه داشته باشید که این واقعیت که فقط دو عدد برای تطبیق توزیع عادی با یک مجموعه داده لازم است ، دلالت بر این دارد که اگر توزیع داده های ما توسط یک توزیع عادی تقریب شود ، تمام اطلاعات مورد نیاز برای توصیف توزیع می توانند فقط در دو شماره رمزگذاری شوند. اکنون این مقادیر را برای لیست دلخواه اعداد تعریف می کنیم.
هنگامی که ما متقاعد شدیم که داده های ما ، می گویند که در وکتور X ذخیره شده است ، توزیع تقریباً طبیعی است ، می توانیم مشخصات مشخصی را پیدا کنیم که با داده های ما با تطبیق متوسط و SD داده ها با میانگین و SD از داده ها مطابقت داشته باشد. توزیع عادی به ترتیب. برای لیستی از اعداد موجود در یک بردار X:
میانگین به عنوان تعریف شده است
و SD به عنوان تعریف شده است
که می تواند به عنوان میانگین فاصله بین مقادیر و میانگین آنها تعبیر شود.
توابع از پیش ساخته میانگین و SD (توجه داشته باشید که به دلایلی که در کتابهای درسی آماری توضیح داده شده است ، SD به طول (x) -1 به جای طول (x) تقسیم می شود) در اینجا قابل استفاده است:
در اینجا یک نقشه از چگالی صاف و توزیع عادی با میانگین = 69. 3 و SD = 3. 6 به عنوان یک خط سیاه با چگالی صاف ارتفاع دانش آموز ما به رنگ آبی آورده شده است:

9. 4 جعبه جعبه
برای درک جعبه های جعبه ، باید برخی از اصطلاحات را که معمولاً در تجزیه و تحلیل داده های اکتشافی استفاده می شود ، تعریف کنیم.
صدک ها مقادیری هستند که داده های (p = 0. 01، 0. 02، . 0. 99) به ترتیب کمتر یا برابر با آن مقدار هستند. به عنوان مثال، مورد (p=0. 10) صدک 10 را صدا می زنیم، که عددی را به ما می دهد که 10٪ از داده ها در زیر است. معروف ترین صدک 50 است که به عنوان میانه نیز شناخته می شود. مورد خاص دیگری که نامی دریافت می کند، چارکی ها هستند که با تنظیم (p=0. 25, 0. 50) و (0. 75) به دست می آیند که توسط boxplot استفاده می شوند.
برای ایجاد انگیزه در طرح های جعبه ای، به داده های قتل ایالات متحده باز خواهیم گشت. فرض کنید می خواهیم توزیع نرخ قتل را خلاصه کنیم. با استفاده از تکنیک تجسم داده که آموخته ایم، می توانیم به سرعت متوجه شویم که تقریب معمولی در اینجا اعمال نمی شود:

در این مورد، هیستوگرام بالا یا نمودار چگالی صاف به عنوان یک خلاصه نسبتا مختصر عمل می کند.
حالا فرض کنید کسانی که عادت داشتند فقط دو عدد را به عنوان خلاصه دریافت کنند، از ما یک خلاصه عددی فشرده تری بخواهند.
نمودار جعبه یک خلاصه پنج عددی متشکل از محدوده به همراه چارک ها (صدک های 25، 50 و 75) ارائه می دهد. پیاده سازی R از باکس پلات ها، هنگام محاسبه محدوده، نقاط پرت را نادیده می گیرند و در عوض آن ها را به عنوان نقاط مستقل ترسیم می کنند. فایل راهنما تعریف خاصی از نقاط پرت ارائه می دهد. نمودار جعبه این اعداد را به عنوان یک "جعبه" با "سبیل" نشان می دهد.

با کادر مشخص شده توسط صدک 25% و 75% و سبیل هایی که محدوده را نشان می دهند. فاصله بین این دو را محدوده بین چارکی می گویند. این دو نقطه با توجه به اجرای R پرت هستند. میانه با یک خط افقی نشان داده شده است.
فقط از همین نمودار ساده، می دانیم که میانه حدود 2. 5 است، که توزیع متقارن نیست، و محدوده 0 تا 5 برای اکثر حالت ها با دو استثنا است.
در بخش 9. 8 در مورد نحوه ساختن جعبه ها بحث می کنیم.
9. 5 طبقه بندی
در تجزیه و تحلیل داده ها، ما اغلب مشاهدات را بر اساس مقادیر یک یا چند متغیر مرتبط با آن مشاهدات به گروه هایی تقسیم می کنیم. به عنوان مثال در بخش بعدی مقادیر قد را بر اساس یک متغیر جنسیت به گروه هایی تقسیم می کنیم: زن و مرد. ما این روش را طبقه بندی می نامیم و گروه های حاصل را طبقات می نامیم.
طبقه بندی در تجسم داده ها رایج است زیرا ما اغلب علاقه مندیم که چگونه توزیع متغیرها در زیر گروه های مختلف متفاوت است. نمونه های متعددی را در این قسمت از کتاب خواهیم دید.
9. 6 مطالعه موردی: توصیف قد دانش آموزان (ادامه)
با استفاده از هیستوگرام ، توطئه های چگالی و صفحات QQ ، ما متقاعد شده ایم که داده های قد مرد به خوبی با توزیع عادی تقریب می یابد. در این حالت ، ما به ET خلاصه ای بسیار موجز گزارش می دهیم: ارتفاعات نر از توزیع عادی با میانگین 69. 3 اینچ و SD 3. 6 اینچ پیروی می کنند. با این اطلاعات ، ET ایده خوبی خواهد داشت که هنگام دیدار با دانشجویان پسر ما ، چه چیزی را انتظار داشته باشد. با این حال ، برای ارائه یک تصویر کامل ، باید خلاصه ای از ارتفاعات زن را نیز ارائه دهیم.
ما یاد گرفتیم که وقتی می خواهیم به سرعت دو یا چند توزیع را با هم مقایسه کنیم ، جعبه ها مفید هستند. در اینجا ارتفاعات زن و مرد آورده شده است:

این طرح بلافاصله نشان می دهد که مردان به طور متوسط بلندتر از زنان هستند. به نظر می رسد انحرافات استاندارد مشابه هستند. اما آیا تقریب عادی نیز برای داده های ارتفاع زن جمع آوری شده توسط نظرسنجی کار می کند؟ما انتظار داریم که آنها دقیقاً مانند مردان ، توزیع عادی را دنبال کنند. با این حال ، توطئه های اکتشافی نشان می دهد که تقریب به همان اندازه مفید نیست:

ما چیزی را می بینیم که برای مردان ندیده ایم: طرح چگالی "دست انداز" دوم است. همچنین ، بالاترین امتیاز تمایل به بلندتر از حد معمول از ارتفاعات مورد انتظار برای توزیع عادی دارد. هنگام گزارش به ET ، ممکن است نیاز به ارائه هیستوگرام به جای انحراف متوسط و استاندارد برای ارتفاعات زن داشته باشیم.
با این حال ، به عقب برگردید و نقل قول توکی را بخوانید. ما متوجه شده ایم که آنچه انتظار نداریم ببینیم. اگر به سایر توزیع های ارتفاع زن نگاه کنیم ، می فهمیم که آنها به خوبی با توزیع عادی تقریب می یابند. پس چرا دانش آموزان دختر ما متفاوت هستند؟آیا کلاس A ما برای تیم بسکتبال زن الزامی است؟آیا نسبت های کمی از زنان ادعا می کنند بلندتر از آنها هستند؟توضیح دیگر ، شاید بیشتر محتمل این است که در فرم دانش آموزان برای ورود به ارتفاعات خود ، زن رابطه جنسی پیش فرض بود و برخی از مردان وارد ارتفاعات خود شدند ، اما فراموش کردند که متغیر جنسی را تغییر دهند. در هر صورت ، تجسم داده ها به کشف یک نقص بالقوه در داده های ما کمک کرده است.
با توجه به پنج مقدار کوچک ، توجه داشته باشید که این مقادیر عبارتند از:
از آنجا که این ارتفاعات گزارش شده است ، یک احتمال این است که دانش آموز به معنای ورود 5'1 "، 5'2" ، 5'3 "یا 5'5" باشد.
9. 7 تمرین
1. متغیرهای حاوی ارتفاع نرها و زنان را مانند این تعریف کنید:
برای هر کدام چند اندازه گیری داریم؟
2. فرض کنید ما نمی توانیم یک نقشه بسازیم و می خواهیم توزیع ها را در کنار هم مقایسه کنیم. ما فقط نمی توانیم همه شماره ها را لیست کنیم. در عوض ، ما به صدک ها نگاه خواهیم کرد. برای هر جنس یک میز پنج ردیف ایجاد کنید که نشان می دهد _percentiles و male_percentiles با صدک های 10 ، 30 ، 50 ، 70 و 90. سپس یک قاب داده با این دو به عنوان ستون ایجاد کنید.
3. جعبه های زیر را که اندازه جمعیت را بر اساس کشور نشان می دهد مطالعه کنید:

کدام قاره کشور با بیشترین اندازه جمعیت دارد؟
4- بیشترین اندازه جمعیت متوسط را دارد؟
5- اندازه متوسط جمعیت برای آفریقا به نزدیکترین میلیون نفر چیست؟
6. چه نسبت از کشورها در اروپا جمعیت زیر 14 میلیون نفر دارند؟
7. اگر از تحول ورود به سیستم استفاده کنیم ، کدام قاره که در بالا نشان داده شده است ، بزرگترین دامنه بین قشر دارد؟
8- مجموعه داده های ارتفاع را بارگیری کنید و فقط با ارتفاعات نر یک بردار X ایجاد کنید:
چه نسبت داده ها بین 69 تا 72 اینچ (بلندتر از 69 ، اما کوتاه تر یا برابر با 72) است؟نکته: از یک اپراتور منطقی و معنی استفاده کنید.
9. 8 GGPLOT2 هندسه
در فصل 8 ، بسته GGPLOT2 را برای تجسم داده ها معرفی کردیم. در اینجا ما نحوه تولید توطئه های مربوط به توزیع ، به ویژه توطئه های نشان داده شده در ابتدا در این فصل را نشان می دهیم.
9. 8. 1 بارپلت
برای تولید بارپلوت می توانیم از هندسه Geom_Bar استفاده کنیم. پیش فرض این است که تعداد هر دسته را بشمارید و یک نوار بکشید. در اینجا طرح مناطق ایالات متحده است.

ما اغلب در حال حاضر یک جدول با توزیع داریم که می خواهیم به عنوان یک بارپلت ارائه دهیم. در اینجا نمونه ای از چنین جدول:
ما دیگر نمی خواهیم GEOM_BAR حساب کند ، بلکه فقط یک نوار را به ارتفاع ارائه شده توسط متغیر نسبت ترسیم کنید. برای این کار ما باید x (دسته ها) و y (مقادیر) را ارائه دهیم و از گزینه STAT = "هویت" استفاده کنیم.

9. 8. 2 هیستوگرام
برای تولید هیستوگرام از GEOM_HISTOGRAM استفاده می کنیم. با نگاهی به پرونده راهنما برای این عملکرد ، می آموزیم که تنها آرگومان مورد نیاز X است ، متغیری که برای آن یک هیستوگرام ایجاد خواهیم کرد. ما X را رها کردیم زیرا می دانیم که این اولین استدلال است. کد به این شکل است:
اگر کد بالا را اجرا کنیم ، به ما پیام می دهد:
stat_bin () با استفاده از سطل = 30. با Binwidth ارزش بهتری را انتخاب کنید.
ما قبلاً از اندازه سطل 1 اینچ استفاده کردیم ، بنابراین کد به این شکل است:
سرانجام ، اگر به دلایل زیبایی شناختی می خواهیم رنگ اضافه کنیم ، از آرگومان های شرح داده شده در پرونده راهنما استفاده می کنیم. ما همچنین برچسب ها و یک عنوان را اضافه می کنیم:

9. 8. 3 توطئه چگالی
برای ایجاد چگالی صاف ، از Geom_dense استفاده می کنیم. برای ایجاد یک طرح چگالی صاف با داده هایی که قبلاً به عنوان هیستوگرام نشان داده شده است می توانیم از این کد استفاده کنیم:
برای پر کردن رنگ ، می توانیم از آرگومان پر استفاده کنیم.

برای تغییر صاف بودن چگالی ، از آرگومان تنظیم استفاده می کنیم تا مقدار پیش فرض را با آن تنظیم کنید. به عنوان مثال ، اگر ما می خواهیم پهنای باند دو برابر بزرگ باشد که از آنها استفاده می کنیم:
9. 8. 4 جعبه جعبه
هندسه Boxplot Geom_boxplot است. همانطور که بحث شد ، جعبه های جعبه برای مقایسه توزیع مفید هستند. به عنوان مثال ، در زیر ارتفاعات قبلاً برای زنان نشان داده شده است ، اما در مقایسه با مردان. برای این هندسه ، ما به آرگومان X به عنوان دسته ها و y به عنوان مقادیر نیاز داریم.


filter(sex=="Male") |> ggplot(aes(sample = height)) + geom_qq() ``` By default, the sample variable is compared to a normal distribution with average 0 and standard deviation 1. To change this, we use the `dparams` arguments based on the help file. Adding an identity line is as simple as assigning another layer. For straight lines, we use the `geom_abline` function. The default line is the identity line (slope = 1, intercept = 0). ```r params filter(sex=="Male") |> summarize(mean = mean(height), sd = sd(height)) heights |> filter(sex=="Male") |> ggplot(aes(sample = height)) + geom_qq(dparams = params) + geom_abline() ``` Another option here is to scale the data first and then make a qqplot against the standard normal. ```r heights |> filter(sex=="Male") |> ggplot(aes(sample = scale(height))) + geom_qq() + geom_abline() ``` >
9. 8. 5 تصویر
تصاویر برای مفاهیم شرح داده شده در این فصل مورد نیاز نبودند ، اما ما در بخش 11. 14 از تصاویر استفاده خواهیم کرد ، بنابراین دو هندسه مورد استفاده برای ایجاد تصاویر را معرفی می کنیم: Geom_Tile و Geom_Raster. آنها به طور مشابه رفتار می کنند. برای دیدن تفاوت آنها ، لطفاً با پرونده راهنما مشورت کنید. برای ایجاد یک تصویر در GGPLOT2 به یک قاب داده با مختصات X و Y و همچنین مقادیر مرتبط با هر یک از این موارد نیاز داریم. در اینجا یک قاب داده است.
توجه داشته باشید که این نسخه مرتب یک ماتریس ، ماتریس (1: 120 ، 12 ، 10) است. برای ترسیم تصویر از کد زیر استفاده می کنیم:
با این تصاویر اغلب می خواهید مقیاس رنگ را تغییر دهید. این کار را می توان از طریق لایه scale_fill_gradientn انجام داد.

9. 8. 6 توطئه سریع
در بخش 8. 13 ما QPLOT را به عنوان یک عملکرد مفید معرفی کردیم وقتی که نیاز به ساخت سریع پراکندگی داریم. ما همچنین می توانیم از QPLOT برای ساخت هیستوگرام ، توطئه های چگالی ، جعبه پلاک ، qqplots و موارد دیگر استفاده کنیم. اگرچه سطح کنترل GGPLOT را فراهم نمی کند ، اما QPLOT قطعاً مفید است زیرا به ما اجازه می دهد تا با یک قطعه کوتاه از کد یک نقشه تهیه کنیم.
فرض کنید ما ارتفاعات زن را در یک شی x داریم:
برای ساختن یک هیستوگرام سریع می توانیم استفاده کنیم:
این عملکرد حدس می زند که ما می خواهیم یک هیستوگرام درست کنیم زیرا ما فقط یک متغیر را تهیه کردیم. در بخش 8. 13 دیدیم که اگر QPLOT دو متغیر را عرضه کنیم ، به طور خودکار یک پراکندگی را ایجاد می کند.
برای ساختن QQPLOT سریع باید از آرگومان نمونه استفاده کنید. توجه داشته باشید که می توانیم مانند GGPLOT لایه هایی را اضافه کنیم.
اگر یک عامل و یک وکتور عددی را تهیه کنیم ، نقشه ای مانند زیر را بدست می آوریم. توجه داشته باشید که در کد زیر ما از آرگومان داده استفاده می کنیم. از آنجا که قاب داده اولین آرگومان در QPLOT نیست ، ما باید از اپراتور DOT استفاده کنیم.
ما همچنین می توانیم با استفاده از آرگومان Geom یک هندسه خاص را انتخاب کنیم. بنابراین برای تبدیل طرح بالا به یک جعبه ، از کد زیر استفاده می کنیم:
ما همچنین می توانیم از آرگومان ژئوم برای تولید یک طرح چگالی به جای هیستوگرام استفاده کنیم:
اگرچه به اندازه GGPLOT نیست ، اما ما برای بهبود نتایج QPLOT انعطاف پذیری داریم. با نگاهی به پرونده راهنما ، روش های مختلفی را می بینیم که می توانیم ظاهر هیستوگرام را در بالا بهبود بخشیم. به عنوان مثال:

نکته فنی: دلیل استفاده از من ("سیاه") به این دلیل است که ما می خواهیم qplot به جای تبدیل آن به یک عامل ، "سیاه" را به عنوان یک شخصیت تبدیل کند ، که این رفتار پیش فرض در AES است که در اینجا داخلی خوانده می شود. به طور کلی ، عملکردی که من در R استفاده می کنم برای گفتن "آن را همانطور که هست" نگه دارید.
9. 9 تمرین
1. اکنون ما قصد داریم از عملکرد Geom_Histogram استفاده کنیم تا یک هیستوگرام از ارتفاعات در قاب داده ارتفاع ایجاد کنیم. هنگام خواندن اسناد مربوط به این عملکرد ، می بینیم که فقط به یک نقشه برداری نیاز دارد ، مقادیر مورد استفاده برای هیستوگرام. یک هیستوگرام از همه توطئه ها درست کنید.
متغیر حاوی ارتفاعات چیست؟
2. اکنون یک شیء GGPLOT را با استفاده از لوله ایجاد کنید تا داده های Heights را به یک شی GGPLOT اختصاص دهید. ارتفاع را از طریق عملکرد AES به مقادیر X اختصاص دهید.
3. اکنون ما آماده هستیم تا یک لایه اضافه کنیم تا در واقع هیستوگرام را بسازیم. برای ساخت هیستوگرام از شیء ایجاد شده در تمرین قبلی و عملکرد GEOM_HISTOGRAM استفاده کنید.
4- توجه داشته باشید که وقتی کد را در تمرین قبلی اجرا می کنیم ، هشدار را دریافت می کنیم: stat_bin () با استفاده از سطل = 30. ارزش بهتری را با Binwidth انتخاب کنید.
برای تغییر هیستوگرام ساخته شده در تمرین قبلی برای استفاده از سطل های اندازه 1 اینچ از آرگومان Binwidth استفاده کنید.
5- به جای هیستوگرام ، ما قصد داریم یک طرح چگالی صاف ایجاد کنیم. در این حالت ما یک شی را نمی سازیم ، بلکه در عوض طرح را با یک خط کد ارائه می دهیم. هندسه را در کدی که قبلاً برای ایجاد چگالی صاف به جای هیستوگرام استفاده شده بود ، تغییر دهید.
6. اکنون ما قصد داریم یک طرح چگالی برای مردان و زنان به طور جداگانه بسازیم. ما می توانیم این کار را با استفاده از استدلال گروه انجام دهیم. ما قبل از انجام محاسبات مورد نیاز برای تخمین تراکم ، گروه ها را از طریق نقشه برداری زیبایی شناسی به گروه نیاز داریم.
7. ما همچنین می توانیم گروه ها را از طریق استدلال رنگ اختصاص دهیم. این مزیت اضافه شده ای دارد که از رنگ برای تمایز گروه ها استفاده می کند. برای استفاده از رنگ ، کد بالا را تغییر دهید.
8- ما همچنین می توانیم گروه ها را از طریق آرگومان پر کنیم. این فواید دیگری را دارد که از رنگ ها برای تمایز گروه ها استفاده می کند ، مانند این:
با این حال ، در اینجا چگالی دوم بر روی دیگری کشیده شده است. ما می توانیم با استفاده از ترکیب آلفا برای افزودن شفافیت ، منحنی ها را مشاهده کنیم. پارامتر آلفا را روی 0. 2 در عملکرد GEOM_DENCY تنظیم کنید تا این تغییر ایجاد شود.
فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید
برچسب :
نویسنده : آرش اصل زاد
بازدید : <-PostHit->
تاريخ : سه
شنبه
30 خرداد
1402 ساعت: 21:36